به گزارش اطلاعات آنلاین به نقل از eLight، یک سیستم هوش مصنوعی جدید که از نور برای تجزیه و تحلیل همزمان بیش از دوازده ویدیو استفاده میکند و دیپفیکها (جعل عمیق) را با دقت تقریباً ۹۸ درصد تشخیص میدهد. سرعت، مصرف انرژی کم و مقاومت در برابر حملات میتواند آن را به ابزاری قدرتمند برای غربالگری سیل رو به رشد ویدیوهای تولید شده توسط هوش مصنوعی تبدیل کند.
محققان دانشگاه کالیفرنیا، لسآنجلس (UCLA) یک پردازنده نوری-عصبی جدید ساختهاند که از نور برای شناسایی سریع و دقیق ویدیوهای دیپفیک یا جعل عمیق استفاده میکند. برخلاف سیستمهای معمولی که معمولاً ویدیوها را یکی پس از دیگری با استفاده از سختافزار دیجیتال بررسی میکنند، فناوری UCLA میتواند ۱۵ یا تعداد بیشتری از جریانهای ویدیویی را به طور همزمان تجزیه و تحلیل کند.
تفاوت کلیدی این است که بخشی از فرآیند تشخیص از طریق انتشار فیزیکی نور انجام میشود. این امر به بسیاری از ویدیوها اجازه میدهد تا به طور همزمان در طول یک عبور نوری واحد ارزیابی شوند؛ نه اینکه هر کدام نیاز به حرکت جداگانه از طریق یک خط لوله پردازش دیجیتال معمولی داشته باشند.
محققان سیستم هوش مصنوعی نوری را طوری طراحی کردهاند که به عنوان یک لایه دفاعی اولیه با توان عملیاتی بالا و مقاوم در برابر حمله برای غربالگری مقادیر زیادی از ویدیوهای دستکاری شده و تولید شده توسط هوش مصنوعی عمل کند.
چالش رو به رشد تشخیص دیپ فیک
پیشرفتهای سریع در هوش مصنوعی مولد، ویدیوهای مصنوعی را به طور فزایندهای واقع گرایانه کرده و نیاز به سیستمهای تشخیصی را که هم دقیق و هم قادر به کار در مقیاس بزرگ باشند، افزایش داده است.
بسیاری از تشخیص دهندههای پیشرفته دیپفیک به حجم عظیمی از محاسبات دیجیتال وابسته هستند. یک تجزیه و تحلیل واحد میتواند به صدها میلیارد عملیات ممیز شناور نیاز داشته باشد و ویدیوها اغلب به صورت متوالی پردازش میشوند. با بررسی محتوای بیشتر، هم زمان پردازش و هم نیازهای انرژی میتوانند به طور متناسب افزایش یابند.
سیستمهای تشخیص دیجیتال با مشکل دیگری نیز مواجه هستند. مهاجمان میتوانند عمداً ویدیوهای جعلی را به روشهای ظریفی تغییر دهند تا یک آشکارساز را گیج کرده و فیلمهای دستکاری شده را اصیل جلوه دهند.
پروفسور آیدوغان اوزجان و تیم او در دانشگاه UCLA یک سیستم ترکیبی دیجیتال-اپتیکی را توسعه دادند که برای رسیدگی به هر دو چالش در نظر گرفته شده است.
یک رمزگذار دیجیتال سبک وزن ابتدا اطلاعات فشردهای در مورد هر ویدیو، از جمله ویژگیهای مکانی، طیفی و زمانی، جمعآوری میکند. این اطلاعات به یک الگوی فاز تبدیل شده و روی یک مدولاتور نوری مکانی قابل برنامهریزی نمایش داده میشود.
سپس جبهه موج نوری حاصل از طریق یک رمزگشای نوری غیرفعال مبتنی بر فضای آزاد حرکت میکند. در انتهای دیگر، آشکارسازهای نوری جفت شده مستقیماً برای هر ویدیو امتیاز اصالت تولید میکنند.
در واقع، این سیستم یک شبکه رمزگشایی دیجیتال با محاسبات سنگین را با یک فرآیند فیزیکی جایگزین میکند که میتواند جریانهای زیادی را به صورت موازی مدیریت کند.
دقت تقریباً ۹۸ درصد در ۱۵ ویدیو به طور همزمان
در آزمایشهایی با استفاده از نور مرئی، پردازنده ۱۵ ویدیوی Celeb-DF را به طور همزمان در هر عبور نوری بررسی کرد.
این سیستم به طور متوسط به دقت تشخیص ۹۷.۷۹ درصد، حساسیت ۹۹.۸۶ درصد و اختصاصیت ۹۵.۷۲ درصد دست یافت. حساسیت، میزان موفقیت سیستم در شناسایی ویدیوهای دستکاریشده را اندازهگیری میکند و این حساسیت بالا را برای یک ابزار غربالگری که برای جلوگیری از ورود محتوای جعلی طراحی شده است، بسیار مهم میکند.
حساسیت ۹۹.۸۶ درصد به نرخ منفی کاذب متوسط حدود ۰.۱۴ درصد تبدیل شد. به عبارت دیگر، تنها بخش بسیار کمی از ویدیوهای دستکاریشده به اشتباه به عنوان معتبر طبقهبندی شدند.
محققان همچنین با افزایش ظرفیت سیستم به ۱۸ ویدیو در یک عبور نوری، آن را به سطح بالاتری رساندند. حتی در آن سطح، دقت تشخیص متوسط در ۹۶.۱۳ درصد باقی ماند.
لایههای نوری بیشتر، عملکرد را افزایش میدهند
این تیم دریافت که پردازنده همچنین میتواند با افزایش عمق فیزیکی رمزگشای نوری غیرفعال خود، بدون افزایش قابل توجه مصرف انرژی یا تأخیر استنتاج، توانمندتر شود.
وقتی محققان دو لایه پراش غیرفعال بهینهشده را هنگام آزمایش دستکاریهای پیچیدهتر دیپفیک اضافه کردند، دقت تشخیص حدود ۶.۸ درصد بهبود یافت.
این لایههای پراش فقط فاز میتوانند به عنوان ساختارها/سطوح نوری غیرفعال و ایستا تولید شوند. آنها محاسبات اضافی را از طریق پراش نور انجام میدهند؛ به این معنی که در حین انجام استنتاج توسط سیستم، به برق اضافی نیاز ندارند.
این رویکرد میتواند پردازش پیچیدهتر را بدون هزینههای انرژی مشابه که معمولاً با شبکههای عصبی دیجیتال بزرگتر همراه است، امکانپذیر کند.
آزمایش سیستم در برابر ویدیوهای Google VEO-۳
محققان آزمایشهای خود را به دیپفیکهای تعویض چهره مرسوم محدود نکردند. آنها همچنین پردازنده را با ویدیوهایی که با استفاده از مدل VEO-۳ گوگل تولید شدهاند، به چالش کشیدند.
سیستمهای هوش مصنوعی مولد جدیدتر میتوانند فیلمهایی ایجاد کنند که فاقد بسیاری از مصنوعات آشکار مرتبط با فناوری دیپفیک قبلی هستند و آنها را به هدف دشوارتری برای آشکارسازهایی تبدیل میکند که عمدتاً بر روی اشکال قدیمیتر دستکاری آموزش دیدهاند.
نتایج نشان میدهد که این رویکرد میتواند به طور بالقوه با تکامل فناوری هوش مصنوعی مولد سازگار شود.
یک آشکارساز دیپفیک که طوری طراحی شده که فریب دادنش سختتر باشد
سیستم نوری همچنین در برابر حملات جعبه سیاه خصمانه مقاومت نشان داده و محافظت ذاتی در برابر حملات جعبه سفید فراهم میکند.
بخشی از این امنیت از نحوه انجام فیزیکی محاسبات آشکارساز ناشی میشود. از آنجا که برخی از فرآیند استنتاج از طریق پراش انجام میشود، پارامترهای مهم مدل نوری به طور مؤثر در سختافزار تعبیه شدهاند.
اندازهگیری، بازتولید یا مهندسی معکوس این پارامترها برای یک مهاجم میتواند دشوار باشد. این امر بازسازی آشکارساز و طراحی تغییرات خصمانه با دقت تنظیم شده که میتواند از آن فرار کند را به طور قابل توجهی دشوارتر میکند.
پردازنده همچنین هنگامی که ویدیوها تحت تأثیر نویز تصویر، تاری، فشردهسازی JPEG و ناهماهنگیهای تجربی قرار گرفتند، با اطمینان به کار خود ادامه داد. به گفته محققان، این نتایج نشان میدهد که چگونه محاسبات نوری میتواند پایهای امنتر و قابل اعتمادتر برای برخی از سیستمهای هوش مصنوعی فراهم کند.
خط اول دفاع در برابر دیپفیک
پردازنده UCLA به جای جایگزینی کامل آشکارسازهای دیجیتال پیشرفته، به گونهای طراحی شده است که به عنوان یک مرحله اول بسیار حساس از یک سیستم تشخیص بزرگتر عمل کند.
حجم عظیمی از ویدیو میتواند در ابتدا از پردازنده نوری موازی عبور کند. سپس محتوایی که به عنوان مشکوک شناسایی میشود، میتواند برای ارزیابی نهایی دقیقتر به مدلهای دیجیتال با محاسبات پیچیدهتر ارسال شود.
چنین سیستمی میتواند نقاط قوت هر دو رویکرد را با هم ترکیب کند. پردازش نوری میتواند عملکرد موازی، نیاز به انرژی کم برای رمزگشایی، حساسیت بالا، مقاومت در برابر حملات خصمانه و قابلیت سازگاری با مولدهای ویدیوی هوش مصنوعی جدیدتر را فراهم کند؛ در حالی که سیستمهای دیجیتال معمولی میتوانند در صورت لزوم تجزیه و تحلیل عمیقتری ارائه دهند.
محققان میگویند این ترکیب در نهایت میتواند برای تعدیل محتوا در مقیاس بزرگ، احراز هویت رسانهای، نظارت و سایر برنامههای هوش مصنوعی با امنیت بالا مفید باشد.